跳转至

文章背景与核心概要

在复杂的 AI Agent 应用中,可靠的多轮工具调用要求智能体能够准确地保存不断演化的任务状态,并生成前后一致的行动。然而,传统的直接函数调用和 ReAct 风格的策略往往会遭遇状态-行动竞争(state-action competition)——即生成紧邻的下一个函数调用的压力,会导致模型忽略或覆盖掉累积的历史上下文。

为了解决这一痛点,本文作者引入了 OODA-Tool,这是一种受博伊德(Boyd)观察-调整-决策-行动(OODA)循环启发的强类型闭环策略。OODA-Tool 没有直接从原始交互历史中生成行动,而是通过控制器检查的中间状态来路由决策,从而将状态保存与行动实现解耦:1. 观察(Observe):重建当前任务状态;2. 调整(Orient):评估执行是否必要;3. 决策(Decide):形成合法的行动结构;4. 行动(Act):产生最终的外部输出。

通过在多轮、多工具以及信息不完全的环境中使用 Qwen3 模型(参数量从 0.6B 到 14B)进行评估,OODA-Tool 持续提升了任务成功率,其中在较小规模的模型以及复杂的、依赖状态的多轮任务中,性能提升最为显著。


From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use

From State to Action: OODA-Tool for Reliable Multi-Turn Tool Use

Metadata

Metadata

  • Subjects: Artificial Intelligence (cs.AI); Software Engineering (cs.SE)
  • Subjects: Artificial Intelligence (cs.AI); Software Engineering (cs.SE)
  • Submitted: August 25, 2026
  • Submitted: August 25, 2026
  • Authors: Rongfeng Guo, Yinxuan Huang, Yusen Wu, Maoqing Zhong, Yunlu Chen, Meng Tang, Teng Long, Vincent Tao Hu
  • Authors: Rongfeng Guo, Yinxuan Huang, Yusen Wu, Maoqing Zhong, Yunlu Chen, Meng Tang, Teng Long, Vincent Tao Hu

Abstract Summary

Abstract Summary

可靠的多轮工具调用要求 AI 智能体准确保存演变中的任务状态并生成一致的行动。传统的直接函数调用和 ReAct 风格的策略往往遭受状态-行动竞争的困扰——在这种竞争中,生成下一个即时函数调用的压力会导致模型忽略或覆盖累积的历史上下文。

Reliable multi-turn tool use requires an AI agent to accurately preserve evolving task states and generate consistent actions. Traditional direct function-calling and ReAct-style policies often suffer from state-action competition—where the pressure to generate the next immediate function call causes the model to ignore or overwrite accumulated historical context.

为了解决这个问题,作者引入了 OODA-Tool,这是一种受博伊德的观察-调整-决策-行动(OODA)循环启发的类型化闭环策略。OODA-Tool 没有直接从原始交互历史中生成行动,而是通过控制器检查的中间状态来路由决策,从而将状态保存与行动实现解耦: 1. 观察(Observe): 重建当前任务状态。 2. 调整(Orient): 评估执行是否必要。 3. 决策(Decide): 形成合法的行动结构。 4. 行动(Act): 产生最终的外部输出。

To solve this, the authors introduce OODA-Tool, a typed closed-loop policy inspired by Boyd’s Observe-Orient-Decide-Act (OODA) cycle. Rather than generating actions directly from raw interaction histories, OODA-Tool decouples state preservation from action realization by routing decisions through controller-checked intermediate states: 1. Observe: Reconstructs the current task state. 2. Orient: Evaluates whether execution is necessary. 3. Decide: Forms an admissible action structure. 4. Act: Produces the final external output.

通过在多轮、多工具和信息不完全的环境中使用 Qwen3 模型(参数范围从 0.6B 到 14B)进行评估,OODA-Tool 持续提高了任务成功率,其中在较小模型和复杂、依赖状态的多轮任务中观察到了最显著的性能提升。

Evaluated using Qwen3 models (ranging from 0.6B to 14B parameters) across multi-turn, multi-tool, and incomplete-information environments, OODA-Tool consistently improves task success rates, with the most significant performance gains observed in smaller models and complex, state-dependent multi-turn tasks.